昨天講了一套按失敗風險派工的規矩。今天要講我們怎麼把它推翻一半。
時間是 2026 年 7 月 14 日。
那陣子我注意到一件事:我按規矩把「研究」派給負責廣搜的那位、把「查證」派給負責把關的那位,但每次拿回來的東西,品質差距沒有我預期的大。有幾次甚至是被派去做輔助的那位,講出了最關鍵的一句。
於是我做了個測試。同一個開放型問題,不分工,五位全部丟下去,各自給我一份完整的答案。
結果是五份都能用。
這件事後來寫進主指令,原話是「全員皆 complete agent」。
意思是各家旗艦模型的判斷力已經拉到差不多的水準,每一位都能獨立做完一輪完整的研究、查證、找點子。不是誰比誰強一截,是門檻整體上來了。
所以規矩改成這樣:
開放型任務(研究、找點子、查證、審查、腦力激盪)預設全員並進,各出完整獨立視角,不再按守備位切割。我負責綜合、去重、把關。
原本那套「按主要風險派」沒有廢掉,它退到執行型任務去了——要快落地、要並行排程、單一工具的活,那時候才需要判斷瓶頸在誰身上。
一開始我以為並進只是「多花錢買保險」。後來發現不是。
真正的價值在它們會互相抓錯。
8 月 7 日那天有個例子。我寫了一段話引述某篇論文,說那篇文章發現「生成的題目沒通過品質檢核、錯誤率隨學科漂移」。這句話我寫得很順,自己讀過幾遍都沒發現問題。
我把它丟給四位隊友獨立複驗。
三位各自抓到同一條錯:那篇論文講的是 ChatGPT 生成的提示(hints),不是題目;而且它的四個主題全部都是數學的子領域,根本沒有「跨學科漂移」這回事。
第四位回我:「查證屬實,完全符合數據。」
如果我按老規矩只派給那一位,這條錯就進送審稿了。
分工有一個你不會馬上察覺的代價:它把你的檢查點減少到一個。
當你說「研究這件事交給他」,你同時也決定了「這件事只會被一雙眼睛看過」。而 AI 出錯的方式跟人不一樣,它不會遲疑、不會說「我不太確定」,它會用同樣流暢的語氣把錯的東西講完。
一雙眼睛看不出流暢度的差別,四雙可以——因為錯誤是隨機的,正確是收斂的。四份獨立答案裡,對的那些會互相印證,錯的那個會孤立地站在那裡。
判斷力拉平,不代表能做的動作也拉平了。
能不能推 git、能不能碰個資、能不能讀到自己的輸出、能不能開瀏覽器,這些跟模型聰不聰明無關,跟它跑在什麼樣的沙箱裡有關。
我在這裡吃過虧,明天整篇就講這個。